Opus 5为何越来越难用?过度追求基准测试正在牺牲真实任务中的协作能力
thinkindev • 2026-08-17
3155 views
Opus 5在与前代模型对比中暴露出一个值得关注的问题:它需要更多人工监督,且在模糊场景下不再主动追问澄清,导致真实任务中的协作效率下降。分析认为,这一变化并非单纯的能力退化,而是当前AI系统开发过度以基准测试为导向的结果。为了在榜单上取得高分,模型被训练得更倾向于直接给出大胆假设,而忽略了现实任务中必要的澄清、追问与灵活调整。由于真实工作场景往往信息不完整、需求多变,这种“假设优先”的行为会放大错误风险,也让使用者不得不承担更多校对和引导成本。该观察反映出模型评测与真实可用性之间的落差:当自我改进系统只围绕可量化指标优化时,可能在标准测试中表现亮眼,却牺牲了协作中关键的交互质量与可靠性。
核心要点
- Opus 5在模糊任务中缺乏主动澄清,需要更多人工监督,协作体验下降。
- 问题根源被认为是过度追求基准测试表现,偏向大胆假设而非真实任务所需的追问与灵活性。
- 反映出AI模型评测指标与真实场景可用性之间存在明显落差。